126 머신러닝 기초
머신러닝 기초는 데이터로 규칙을 학습하는 전체 절차를 이해하고, Python 기반 실습으로 문제정의부터 모델 평가까지 수행하는 실무 입문 과정이다.
0. 교육을 하는 이유와 궁극적인 목표
머신러닝 기초 교육의 궁극적인 목표는 학습자가 데이터 수집, 전처리, 특성 설계, 모델 선택, 학습, 검증, 해석, 간단한 배포 흐름을 하나의 프로젝트로 완성할 수 있게 하는 것이다. 민간 AI·ML 부트캠프와 전문 인증 과정의 프로젝트 기반 흐름을 참고해 scikit-learn 중심의 실습, 모델 평가, 포트폴리오 산출물 제작으로 구성한다.
참고한 유료형 교육 흐름
- Python·NumPy·pandas 선행 후 scikit-learn으로 모델을 구현하는 부트캠프형 흐름
- 분류·회귀·클러스터링·기초 신경망을 한 프로젝트 체계로 연결하는 유료 트랙 흐름
- Kaggle·Colab·GitHub 포트폴리오 제출을 요구하는 실무형 데이터 사이언스 과정
- 모델 정확도보다 데이터 누수, 평가 지표, 재현성, 설명가능성을 함께 검수하는 현업형 방식
입문 · 1일
입문 머신러닝 기초 교육과정
머신러닝의 역할과 전체 개발 절차를 작은 예제로 이해한다.


| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 머신러닝 문제 유형을 구분한다. | 스팸 분류, 가격 예측, 고객 군집, 추천 사례를 지도·비지도·강화학습으로 분류한다. 전통 프로그래밍 규칙 작성과 데이터 기반 학습의 차이를 카드 분류 활동으로 비교한다. |
| 목표 2 | 데이터셋 구조를 읽는다. | CSV 파일을 pandas DataFrame으로 열고 행, 열, 결측치, 범주형 변수, 수치형 변수를 확인한다. Google Colab에서 describe, info, value_counts를 실행해 데이터 요약표를 만든다. |
| 목표 3 | 첫 모델을 학습시킨다. | scikit-learn의 train_test_split으로 학습·검증 데이터를 나누고 간단한 DecisionTreeClassifier를 학습한다. 정확도와 혼동행렬을 출력하고 틀린 예측 5개를 직접 해석한다. |
| 사용 플랫폼 | Python, Google Colab, pandas, NumPy, scikit-learn, GitHub |
|---|---|
| 강사 스펙 | Python 기초, 데이터프레임 처리, scikit-learn 분류 실습 지도 경험 3년 이상 |
| 수업대상 | AI 입문자, 중고등 심화반, 대학 비전공자, 교사 연수생 |
| 소요시간 | 4-6시간 |
| 준비물 | 노트북, Google 계정, 실습 CSV 데이터, Colab 노트북, 용어 카드 |
| 산출물 | 문제유형 분류표, 데이터 요약표, 첫 분류 모델 노트북 |
| 평가방법 | 개념분류 25%, 데이터탐색 25%, 모델실행 30%, 오류해석 10%, 참여도 10% |
초급 · 3일
초급 머신러닝 기초 교육과정
전처리와 평가 지표를 포함한 기본 예측 모델을 제작한다.
| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 전처리 파이프라인을 구성한다. | 결측치 대체, 이상치 확인, 범주형 One-Hot Encoding, 스케일링을 ColumnTransformer로 묶는다. 전처리 전후 모델 성능을 비교해 데이터 처리 선택이 결과에 미치는 영향을 기록한다. |
| 목표 2 | 분류와 회귀 모델을 비교한다. | Logistic Regression, RandomForestClassifier, Linear Regression, RandomForestRegressor를 같은 데이터 구조에서 실행한다. accuracy, precision, recall, F1, MAE, RMSE를 문제 성격에 맞게 선택하는 실습을 진행한다. |
| 목표 3 | 모델 검증 규칙을 적용한다. | K-fold cross validation을 사용해 단일 분할 결과의 불안정성을 확인한다. 데이터 누수 사례를 일부러 만든 뒤 성능이 비정상적으로 높아지는 원인을 토론한다. |
| 사용 플랫폼 | Python, JupyterLab, Google Colab, pandas, scikit-learn, Matplotlib, Seaborn |
|---|---|
| 강사 스펙 | 전처리 파이프라인, 평가 지표, 교차검증을 프로젝트형으로 지도 가능한 데이터 강사 3년 이상 |
| 수업대상 | 사무직 리스킬링 학습자, 대학생, 직업훈련생, 청소년 AI 동아리 |
| 소요시간 | 12-18시간 |
| 준비물 | 노트북, Colab 환경, 분류·회귀 데이터셋, 평가표 템플릿 |
| 산출물 | 전처리 파이프라인, 모델 비교표, 검증 리포트 |
| 평가방법 | 전처리 25%, 모델비교 25%, 지표선택 25%, 검증논리 15%, 참여도 10% |
초급 · 1주
초급 1주 머신러닝 기초 교육과정
작은 실무 문제를 선정해 데이터 분석부터 모델 리포트까지 완성한다.


| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 문제정의서를 작성한다. | 예측 대상, 입력 변수, 성공 기준, 사용할 수 없는 데이터, 윤리적 주의점을 1페이지로 정리한다. 소매 판매, 학생 성취, 고객 이탈, 농산물 가격 중 하나를 선택해 프로젝트 질문을 구체화한다. |
| 목표 2 | 피처 엔지니어링을 수행한다. | 날짜에서 월, 요일, 시즌 변수를 만들고 범주형 변수를 의미 있는 그룹으로 재분류한다. 상관관계와 feature importance를 비교해 제거할 변수와 유지할 변수를 결정한다. |
| 목표 3 | 모델 리포트를 만든다. | best model, baseline model, failed model을 함께 제시하고 성능 차이를 표로 정리한다. Jupyter Notebook 결과를 HTML 또는 PDF 리포트로 내보내 GitHub에 업로드한다. |
| 사용 플랫폼 | Python, pandas, scikit-learn, Jupyter Notebook, GitHub, Kaggle Datasets |
|---|---|
| 강사 스펙 | 프로젝트 코칭, 피처 엔지니어링, GitHub 포트폴리오 피드백 경험 4년 이상 |
| 수업대상 | ML 기초를 이수한 학습자, 프로젝트반, 취업 포트폴리오 준비생 |
| 소요시간 | 20-30시간 |
| 준비물 | 노트북, GitHub 계정, Kaggle 계정, 프로젝트 데이터셋, 리포트 양식 |
| 산출물 | 문제정의서, 피처 목록, 모델 리포트, GitHub 저장소 |
| 평가방법 | 문제정의 20%, 피처설계 25%, 모델완성 25%, 리포트 20%, 발표 10% |
중급 · 4주
중급 머신러닝 기초 교육과정
현업형 ML 워크플로우와 실험관리를 적용한다.



| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 실험 구조를 표준화한다. | 데이터 버전, 전처리 버전, 모델 파라미터, 지표를 MLflow 또는 Weights & Biases에 기록한다. 동일 데이터에서 RandomForest, XGBoost, LightGBM을 비교하고 실험명을 규칙화한다. |
| 목표 2 | 모델 튜닝을 수행한다. | GridSearchCV와 RandomizedSearchCV로 하이퍼파라미터 탐색을 수행한다. 과적합 여부를 learning curve와 train-validation score 차이로 진단한다. |
| 목표 3 | 간단한 추론 서비스를 만든다. | joblib로 모델을 저장하고 Streamlit 또는 FastAPI에서 입력값을 받아 예측을 반환한다. 로컬 테스트용 requirements.txt와 README를 작성해 다른 학습자가 실행할 수 있게 한다. |
| 사용 플랫폼 | Python, scikit-learn, XGBoost, LightGBM, MLflow, Streamlit, FastAPI, GitHub |
|---|---|
| 강사 스펙 | ML 실험관리, 모델 튜닝, 간단한 API·앱 배포 경험 4년 이상 |
| 수업대상 | 데이터 분석 중급자, AI 개발 입문자, 사내 AI 전환 교육생 |
| 소요시간 | 40-60시간 |
| 준비물 | 노트북, Python 가상환경, GitHub, 실험관리 계정, 배포 샘플 코드 |
| 산출물 | 실험관리 로그, 튜닝 모델, Streamlit/FastAPI 예측 앱 |
| 평가방법 | 실험설계 25%, 튜닝 25%, 앱구현 25%, 문서화 15%, 발표 10% |
심화 · 8주
심화 머신러닝 기초 교육과정
기관·기업 교육용 ML 프로젝트 운영 체계와 강사용 자료를 완성한다.



| 구분 | 세부 내용 | 실천·실습 방법 |
|---|---|---|
| 목표 1 | 강사용 ML 모듈을 설계한다. | 개념, 전처리, 모델, 평가, 배포, 윤리 모듈을 수준별 8주 커리큘럼으로 재구성한다. 실습 데이터 난이도와 힌트 단계를 조절해 초급·중급 분반용 지도안을 만든다. |
| 목표 2 | ML 운영 체크리스트를 구축한다. | 데이터 품질, 개인정보, 편향, 재현성, 평가 지표, 배포 위험을 점검하는 체크리스트를 제작한다. 잘못된 모델 사례를 수집해 수업용 디버깅 케이스로 변환한다. |
| 목표 3 | 최종 ML 서비스 제안서를 작성한다. | 선정한 문제에 대해 데이터 흐름, 모델 구조, 운영 인력, 비용, 위험관리, 성과지표를 포함한 제안서를 만든다. 최종 발표에서 모델 성능뿐 아니라 도입 타당성과 유지보수 계획을 설명한다. |
| 사용 플랫폼 | Python, scikit-learn, MLflow, FastAPI, Streamlit, GitHub Actions, Notion |
|---|---|
| 강사 스펙 | ML 강사양성, 기업 교육, 모델 운영·윤리 검수, 프로젝트 멘토링 경험 5년 이상 |
| 수업대상 | AI 교육 강사, 사내 DX 리더, 기관 데이터 담당자, 컨설턴트 |
| 소요시간 | 80-120시간 |
| 준비물 | 강사용 PC, 수준별 데이터셋, 실습 노트북, 체크리스트 템플릿, 발표 양식 |
| 산출물 | 강사용 지도안, ML 운영 체크리스트, 서비스 제안서, 최종 발표자료 |
| 평가방법 | 지도안 25%, 운영체계 25%, 제안서 25%, 멘토링 15%, 발표 10% |